iT邦幫忙

2026 iThome 鐵人賽

DAY 19
0

同一道 BE03,在較低與較高投入程度下,選到高類別的機率會差多少?CTT(古典測驗理論)從加總分的變異出發,因素模型看題目共變;今天用試題反應理論(IRT)直接描述這個機率。它把人的潛在位置 θ 與題目參數放在同一個模型尺度上,也要求我們明說維度、局部獨立與尺度識別等假設。

先用 2PL 看二分反應

對二分題目,logistic(邏輯函數) 2PL(雙參數邏輯模型)可寫成:

P(Y_j = 1 | θ) = 1 / (1 + exp[−a_j (θ − b_j)])

在能力 θ 下答對第 j 題的機率,等於 1 除以 1 加上 exp 負 a_j 乘以 θ 減 b_j。

b_j 是曲線中點的位置;當 θ=b_j,機率為 0.5。a_j>0 控制曲線在中點附近的斜率/鑑別。這些詞只在指定模型與尺度下解釋,不是題目看一眼就擁有的永久屬性。

ENGAGE-v1 原本是五點題,直接套二分 2PL 會改變資料。為了手算,我定義一個教學用 derived 作答反應(response):BE03 選 4 或 5 記為 1,其餘記為 0,命名 BE03_hi。這只展示 2PL;正式分析應考慮保留 ordinal categories(有序類別)的 polytomous 模型(model)。二分化會丟失資訊,不能悄悄完成。

六層責任

層 2PL 工作模型
資料機制 給定 latent θ,題目以 logistic probability 產生二分反應
目標 person location θ、item location b、discrimination a 與反應機率
假設 選定維度、local independence、monotonic ICC、尺度識別、模型與母體適用
可觀察量 item response patterns 與其頻率
估計規則 marginal maximum likelihood 等校準 items,再以 ML/MAP/EAP 等估 person
保證/限制 模型下連結 people/items 與局部精確度;不證明單維、內容品質或跨群體不變

IRT(試題反應理論)的 scale 沒有天然零點與單位,常透過潛在(latent) distribution 或題目(item) constraints 識別。換尺度時 a、b 的數值會改,作答反應 probabilities 可保持一致。因此不能跨未連結 calibration(題目參數校準)直接比較題目難度。

完整例題:看懂題目特徵曲線(ICC)

假設 BE03_hi 的 a=1.5、b=0.5。當 θ=0.5,指數部分為 0,所以 P=.5。當 θ=1.5:

P = 1 / [1 + exp(−1.5)] ≈ 0.818

當指數部分為 1.5,答對機率約 0.818。

當 θ=-0.5,則 P≈0.182。同一題對不同 θ 並非同樣容易出現高反應。

再比較一題 a=0.7, b=0.5。兩題在 θ=.5 都有 P=.5,但第二題曲線較平;θ 離開中點時,機率變化較慢。這是 discrimination 的局部意義,不是把學生分成「會/不會鑑別」。

2PL 在 logistic constant 取 1 時的題目資訊量(item information)是:

I_j(θ) = a_j² × P_j(θ) × [1 − P_j(θ)]

題目資訊量等於鑑別度的平方,乘以答對機率,再乘以答錯機率。

第一題在 θ=b=.5 的 information(題目資訊量)為 1.5²×.25=.5625。同一題在遠離 b 時,P(1-P) 下降,information 也下降。題目「好不好」必須附帶 在哪個 θ、為哪個用途。

Claude 協作:逐一測試公式邊界

請 Claude 解釋 a 與 b 時,可以用「b 是答對題目所需的能力」檢查用語。投入題沒有客觀答對;即使是成就題,b 也是模型下達到指定反應機率的位置。這裡應說「出現高類別反應」,並先交代二分規則,才不會把態度題偷偷換成成就測驗。

我再要求邊界測試:θ=b 必為 .5;a>0 時機率隨 θ 單調上升;θ 趨正/負無窮時接近 1/0;a 接近 0 時曲線接近平坦。逐點代入可抓符號反轉,這是語言解釋看不出的常見錯誤。

反例:高鑑別參數不等於好題

某題 a 很高,但內容只是「我一定會準時交作業」,它可能窄化行為投入,或受課程規定驅動。曲線很陡只表示模型下反應對 θ 的局部變化強,不處理內容代表性與公平性。

第二個 failure case(失敗案例)是 local dependence(題目間局部相依)。BE01 與 BE04 wording 高度重疊,給定 θ 後仍一起變動;模型可能把殘餘關聯吸收到 inflated discrimination 與 information。若不查題目殘差(residual)/testlets,CAT(電腦適性測驗)會過度相信重複題目。

第三個反例是把 b 當跨群體固定。Day 18 已顯示 BE04 有 group shift;在 IRT 語言可能呈現 DIF(差異試題功能)。若題目參數不具可比性,同一 scale 上的群體比較與適性選題都要重新檢查。

從 factor model 到 IRT

二分 IRT 也可視為對 categorical indicators(指標題目)的 latent-variable 模型;CFA(驗證性因素分析)與 IRT 並非互不相關的世界。差異在連結函數、作答量尺、參數化與主要用途。把兩者放在同一本書,能看見共同的識別、維度、local independence 與模型配適(模型與資料摘要的相容程度)責任。

可先用手算表回答一個問題:當 θ 恰好等於 b,兩道不同鑑別參數的題目機率都是 .5,但資訊量是否相同?代入公式即可看到 a 的平方仍在其中。這讓「反應機率相同」與「估計位置的資訊相同」分成兩個判斷,也為下一篇選題作準備。

題目參數也有估計誤差

教學表常把 a、b 當已知常數;真實應用先要用 calibration sample 估計。樣本小、θ 範圍窄、模型設定錯誤或稀少類別,都會增加不確定性。把 estimated 題目參數固定後再估 person,若忽略 calibration uncertainty,後續標準誤可能過度樂觀。本文手算只做條件於已知參數的解釋,不宣稱完成 calibration。

題目 fit(題目 fit(item fit),模型與資料摘要的相容程度)也不能只看一個總指標。可以按 θ 區段比較 observed 與 expected 作答反應、檢查殘差 dependence、看參數是否跨樣本穩定。若某題模型配適差,先回作答歷程(response process)與內容;刪除不是唯一答案,因為題庫 coverage 可能因此出現缺口。

判斷「差」之前,先分清楚每個指標在摘要什麼:

指標 它摘要什麼 它不能證明什麼
CFI/TLI 相對 baseline model 的改善 構念可區分
RMSEA 近似誤差與自由度 模型正確
SRMR 標準化殘差的平均大小 題目測到對的東西

五類題的正式模型還要處理多個 thresholds(切點)/category functions。graded 作答反應等模型可以保留類別資訊,但要求 categories 使用與 ordering 合理。若某選項幾乎沒人用,thresholds 不穩;把它合併也會改變作答反應 definition。這些都要記入資料處理,而不是由軟體靜默完成。

最後,person θ 是 model-based estimate,不是學生身上的物理刻度。ML 在全 0/全 1 pattern 可能出現極端問題,MAP/EAP 會受 prior(先驗分布)影響;報告時要記 estimator(估計方法)與 uncertainty。個人回饋若忽略這些,精緻小數只會製造虛假精確。

再用尺度轉換檢查一次:若 θ*=2θ+1,相應設定 b*=2b+1、a*=a/2,代入後有 a*(θ*-b*)=a(θ-b),機率因此不變。以本例 a=1.5,b=.5,θ=1.5 來看,新尺度是 .75,2,4,指數的大小仍為 1.5。未做尺度連結就比較兩次校準的 b,數字差不代表題目真的改變。

原問題的答案是:IRT 用作答反應 function 把 person location 與題目參數連在同一任意尺度,並讓精確度隨 θ 改變。它不讓 θ 變成直接觀察的能力,也不替題庫(item bank)取得內容效度。

發展閱讀看 Lord/Novick 與 Chalmers 的 mirt(R 的試題反應理論套件)模型;研究閱讀再進入多分類、多維度、DIF 與尺度連結。本篇留下曲線的手算點、資訊量與二分化限制。下一篇會用資訊量選第一題,再手算一次更新與第二題選擇;完整 CAT 的停止與失敗流程另列為設計要求。

來源與協作揭露


上一篇
測量恆等性:不同群體真的使用同一把尺嗎
下一篇
從 2PL 到 CAT:用 item information 選下一題
系列文
不是叫 AI 寫教科書:大學教師用 Claude 自學心理計量,打造可驗證、可再教的客製化教材 共 22 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言